輝達稱,基於SemiAnalysis的AgentX工作負載、採用DeepSeek V4 Pro模型,Vera Rubin每兆瓦吞吐量最高達到上一代GB300 NVL72的30倍,每Token成本最高降低35倍。SpaceXAI將採用Vera CPU加速下一代智能體AI應用,並擴大基於Vera Rubin的平台建設,SpaceXAI計劃將優化版Vera Rubin NVL72延伸至太空,用於首代Starmind AI衛星。
輝達正在加速把AI基礎設施的競爭,從傳統的模型訓練和推理性能,推進到圍繞智能體AI(Agentic AI)的Token生成速度、能耗和成本展開的新階段。
美東時間24日周一,輝達宣佈面向互動式AI推理的Groq 3 LPX正式全面投產。作為Vera Rubin平台的重要組成部分,Groq 3 LPX主打超低延遲Token生成,輝達稱,在Artificial Analysis測試中,搭載Gemma 4 31B模型、100,000 Token上下文時,Groq 3 LPX實現每秒3400個輸出Token,為該模型創下最高紀錄;針對智能體編程等低延遲工作負載,其響應速度最高達到最近競爭平台的4倍。
同時,輝達公佈Vera Rubin NVL72在真實智能體工作負載下的新測試結果:基於SemiAnalysis的AgentX工作負載、採用DeepSeek V4 Pro模型,Vera Rubin每兆瓦(MW)吞吐量最高達到上一代GB300 NVL72的30倍,每Token成本最高降低35倍。輝達強調,智能體任務不同於傳統聊天或摘要,任務上下文會隨著數百個步驟不斷累積,甚至達到數十萬Token。